iT邦幫忙

2026 iThome 鐵人賽

DAY 1
0
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》系列 第 1

Day1 為什麼 Agent 需要 RL?——從 0 到 Agentic RL 實作的起點

  • 分享至 

  • xImage
  •  

什麼是 AI Agent?

從 ChatGPT Agent到 Claude Coworker,我們又更靠近一直以來對 AI 的幻想:只要告訴機器我們想做什麼,它就能自己規劃並完成整個任務。

它和我們每天使用的 ChatGPT、Gemini 或 Claude 這些大型語言模型(LLM)又什麼不同?
AI Agent 與 LLM 最大的不同是,AI Agent不僅會回答問題,而是理解使用者的需求並完成使用者的需求。


例子
任務:幫我規劃一趟日本自由行

  • LLM:通常會列出一大串建議的景點,然後就沒有了。
  • AI Agent:先搜尋機票與住宿資訊 -> 比較價格 -> 安排每日行程 -> 整理景點資訊 -> 協助預訂飯店

整個過程中,它不是單純地「回答你的問題」,而是真正地「執行任務」


我們期待 Agent 能夠透過與環境互動、不斷嘗試與修正,逐漸學會完成複雜任務的最佳策略。
僅靠傳統的監督式微調(Supervised Fine-Tuning, SFT)仍然有所不足。因此,近年研究開始將焦點轉向強化學習(Reinforcement Learning, RL)。

這也是本系列文章接下來將深入探討的主題。

Reinforcement Learning 是什麼?

那為什麼SFT沒辦法訓練出AI Agent? 為什麼是 RL,而不是別的方法?我們來比較一下 SFT 跟 RL 吧!

面向 SFT (監督式微調) RL(強化學習)
學習方式 模仿,讓模型輸出盡量接近標註的正確答案 試錯,模型自己生成,依據 reward 調整,提高 reward 行為的機率
能否處理「多種正確解」 困難,只能學到訓練資料裡出現過的那幾種寫法可以 只要 reward 設計得好,模型能處理「多種正確解」的問題
能否處理多步驟任務、在失敗時自行修正 困難, 很難標註「這一步錯」這種中間過程 相對適合,可以用 reward 針對整個軌跡或特定步驟給訊號

RL 的優勢在於RL用「結果好壞」當訊號,而不是「標準答案」

RL 在 Agent 的應用是什麼呢?

通常用於複雜任務的拆解與規劃


例子
當給 Agent 一個複雜指令(幫我上網查下週五台北到大阪最便宜的機票,並整理成表格傳到我的email),它不能只靠直覺,而是需要制定計畫
RL 可以訓練 Agent 如何拆解步驟也就是它的思考路徑。

Agent 嘗試不同的拆解方式

  • 如果最終成功完成任務,就會獲得獎勵
  • 如果在中間步驟卡住或出錯,則會被扣分

這樣就可以讓 Agent 學會「先搜尋航班」->「比較價格」->「生成表格」->「呼叫 Email API」這樣的作業流程。


Takeaway

  • AI Agent不僅會回答問題,而是理解使用者的需求並完成使用者的需求。
  • RL 的優勢
    1. 學會最佳策略
    2. 適應未知環境
    3. Agent 可以嘗試、犯錯、修正、再嘗試

Day1 簡單介紹為什麼我們要用RL、RL有哪些好處、優勢,明天會開始 RL 的基礎知識!


下一篇
Day2 掌握 RL 基礎:什麼是 MDP ? Reward ? Policy 又是什麼 ?
系列文
《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》3
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言